ML Engineer - Professional 练习题 — 机器学习工程师 - 专业级

1. 题库联网,会自动更新,无需重新获取;

2. 激活题库立即做题,支持网站、小程序同时做题,每题双语一键切换;

3. 包含在线练习,模拟测试,笔记、错题记录等功能,有效期一年;

4. 建议做题顺序:开背题模式看题➡️顺序练习做题➡️模拟考试 考前自测

5. 激活码可点击右侧 立即购买,或通过天猫旗舰店购买;

6. 有问题可通过小程序、微信、WhatsApp、LINE 联系客服。

考试信息

认证名称:Databricks认证机器学习专家级工程师(Databricks Certified Machine Learning Professional)

认证级别: 专家级,面向中高级机器学习工程师与数据科学家,聚焦企业级大规模机器学习解决方案设计与落地

核心定位: 考核在Databricks湖仓平台上设计、实现和管理企业级ML系统的能力,包括SparkML大规模流水线构建、分布式训练、高级MLflow特性、自动化特征工程及MLOps全流程管理

有效期: 证书有效期2年,到期需参加当期最新版本考试重新认证

推荐经验:  1年以上 Databricks大规模机器学习实战经验,精通Python、分布式ML、MLOps与Databricks平台深度应用


成绩仅显示通过/未通过,不提供具体得分;可查看各领域表现反馈

样题

ML Engineer - Professional · Q1
问题#1 以下哪项描述了概念漂移?
  • A.
    概念漂移是指输入变量的分布发生变化。
  • B.
    概念漂移是指目标变量的分布发生变化。
  • C.
    概念漂移是指输入变量和目标变量之间的关系发生变化。
  • D.
    概念漂移是指模型预测目标分布发生变化的情况。
  • E.
    以上都不能描述概念漂移

答案: C

All Certified Machine Learning Professional Questions认证中流式机器学习模块明确规定,概念漂移的核心判定标准是输入特征与目标标签之间的映射关系发生改变,也就是条件概率P(Y|X)随时间或场景变化出现偏移,这是概念漂移区别于其他数据分布偏移类型的核心标识。本题要求选出概念漂移的准确描述,选项C完全匹配该标准定义,因此为正确答案。 各选项分析: A. 该选项描述的是协变量偏移,仅指输入变量X的边缘分布P(X)发生变化,只要X与Y的映射关系P(Y|X)保持不变就不属于概念漂移,不符合概念漂移的定义,因此错误。 B. 该选项描述的是先验偏移,仅指目标变量Y的边缘分布P(Y)发生变化,只要P(Y|X)未发生改变就不属于概念漂移,因此错误。 C. 该选项描述完全匹配概念漂移的标准定义,即输入变量和目标变量之间的映射关系发生变化,完全符合ACMLP认证对概念漂移的考点界定,因此正确。 D. 该选项描述的是概念漂移可能引发的结果,也就是模型输出的变化,概念漂移本身是数据层面的客观变化,与模型输出无关,因此错误。 E. 由于选项C是概念漂移的准确描述,因此该选项错误。 关键知识点: 1. 概念漂移的核心定义:流式机器学习场景中,输入特征与目标标签之间的条件概率分布P(Y|X)发生变化的现象,是生产环境中机器学习模型上线后性能下降的核心原因之一。 2. 分布偏移类型区分:需明确区分概念漂移、协变量偏移、先验偏移三类常见的数据分布变化,三类偏移的触发原因、检测方法、应对方案均存在差异,是ACMLP认证的高频考点。 3. 概念漂移的检测与应对:生产环境中通常通过监控模型性能变化、校验数据条件分布变化两种路径检测概念漂移,常见应对方案包括增量学习、动态模型更新、漂移自适应算法等。 参考资料: 1. Azure Machine Learning 如何监视数据漂移, 2. MLOps:机器学习中的持续交付和自动化管道, https://cloud.google.com/architecture/mlops-continuous-delivery-and-automation-pipelines-in-machine-learning?hl=zh-cn
ML Engineer - Professional · Q2
问题#2 一位机器学习工程师正在监控生产环境中机器学习应用的分类输入变量。该工程师认为,在最近的数据中,某个特定分类输入变量的缺失值越来越普遍。 以下哪些工具可以帮助这位机器学习工程师验证其推测?
  • A.
    Kolmogorov-Smirnov (KS) 检验
  • B.
    单因素卡方检验
  • C.
    双向卡方检验
  • D.
    詹森-香农距离
  • E.
    以上都不是

答案: B

本题考察机器学习生产环境中分类变量缺失率漂移的验证工具选择,属于All Certified Machine Learning Professional Questions认证中模型运维监控模块的核心考点。工程师需要验证的是某分类变量的近期缺失率是否显著高于历史水平,本质是检验近期该变量的缺失/非缺失二元分类分布是否与历史期望分布存在统计意义上的显著差异。单因素卡方检验(卡方拟合优度检验)可用于对比分类变量的观测频数与理论期望频数的差异,通过预设显著性水平判断差异是否属于随机波动,刚好匹配该场景的验证需求,因此正确答案为B。 各选项分析: A. Kolmogorov-Smirnov (KS) 检验是专门用于对比连续型变量经验分布一致性的统计检验方法,仅支持连续变量的分布校验,无法处理分类变量的分布对比场景,因此不符合本题需求,错误。 B. 单因素卡方检验也称卡方拟合优度检验,适用场景为检验单个分类变量的观测频数分布是否符合预设的理论期望分布。本题中可将历史数据的缺失率作为理论期望,统计近期样本的缺失、非缺失实际频数,通过检验结果判断缺失率升高是否为真实存在的趋势而非随机波动,完全符合需求,正确。 C. 双向卡方检验也称卡方独立性检验,适用场景为检验两个分类变量之间是否存在关联,本题仅需验证单个分类变量的缺失率与历史水平的差异,不需要分析两个变量的关联关系,因此不适用,错误。 D. 詹森-香农距离(JS距离)是衡量两个概率分布相似度的统计量,仅能输出分布差异的大小,无法进行统计显著性校验,不能判断缺失率升高的趋势是随机波动还是真实发生的变化,因此不符合验证推测的需求,错误。 E. 由于选项B为正确答案,因此该选项错误。 关键知识点: 1. 机器学习生产环境数据漂移检测:数据漂移是生产环境模型性能下降的核心诱因之一,需根据变量的类型(连续/分类)选择适配的统计方法验证漂移是否存在统计显著性。 2. 卡方检验的分类与适用场景:单因素卡方检验用于分类变量的拟合优度验证,双向卡方检验用于两个分类变量的独立性验证,二者不可混用。 3. 统计检验与分布距离的差异:统计检验可判断差异的统计显著性,排除随机波动干扰,而分布距离仅能衡量差异的绝对值大小,无法验证差异的可靠性。 参考资料: 1. Google Cloud Vertex AI 数据漂移监控指南, 2. AWS SageMaker 数据质量监控文档, https://docs.aws.amazon.com/sagemaker/latest/dg/model-monitor-data-quality.html
ML Engineer - Professional · Q3
问题#3 一位数据科学家使用 MLflow 来跟踪他们的机器学习实验。在每次 MLflow 运行中,他们都会进行超参数调优。这位数据科学家希望有一个父级运行用于调优过程,每个子级运行对应一个唯一的超参数值组合。 他们使用了以下代码块: " target="_blank" rel="nofollow noopener">https://img.examtopics.com/certified-machine-learning-professional/image1.png"> 该代码块并没有像预期那样在 MLflow 中嵌套运行。 为了使子级运行能够成功地嵌套在父级运行之下,数据科学家需要对上述代码块进行以下哪些更改?
  • A.
    将子运行代码块缩进父运行代码块内
  • B.
    在父级运行中添加 nested=True 参数
  • C.
    从子运行中移除 nested=True 参数
  • D.
    为所有三个运行块的 run_name 参数提供相同的名称
  • E.
    在父运行中添加 nested=True 参数,并从子运行中移除 nested=True 参数

答案: A

本题是All Certified Machine Learning Professional Questions认证中MLOps模块下MLflow实验管理的核心考点,考察考生对MLflow运行上下文和嵌套运行机制的掌握。MLflow的运行嵌套逻辑默认依赖上下文管理器的作用域,当子运行的代码块处于父运行的with mlflow.start_run()上下文作用域内时,MLflow会自动为子运行添加父运行ID元数据,实现父子运行嵌套。题目中代码未实现嵌套的核心原因是子运行代码块未被包含在父运行的上下文作用域内,因此将子运行代码块缩进至父运行代码块内即可满足需求,符合MLflow原生嵌套运行的设计逻辑。 各选项分析: A. 该选项正确,MLflow的with语句启动的运行会作为当前活动运行,其作用域内启动的所有运行会被自动标记为子运行,仅需将子运行代码缩进至父运行的with块内,无需额外参数即可生成嵌套结构,完全解决题目中的问题。 B. 该选项错误,nested=True是子运行的可选配置参数,作用是显式允许在已有活动运行的上下文中启动新运行,该参数仅对当前启动的运行生效,父运行添加该参数无任何效果,无法实现嵌套。 C. 该选项错误,原问题的核心是子运行不在父运行的上下文作用域内,和子运行是否配置nested参数无关,移除该参数无法解决上下文不匹配的问题,也不能生成嵌套结构。 D. 该选项错误,run_name是运行的自定义展示名称,MLflow通过元数据中的parent_run_id字段关联父子运行,和运行名称无关,所有运行使用相同名称也不会形成嵌套结构。 E. 该选项错误,该操作混淆了nested参数的作用对象,父运行无需配置nested参数,且该操作未解决子运行不在父上下文作用域的核心问题,无法实现预期的嵌套效果。 关键知识点: 1. MLflow运行上下文机制,使用with mlflow.start_run()启动的运行会作为当前活动运行,其作用域内启动的所有运行会自动被标记为该运行的子运行,无需额外配置即可形成嵌套结构。 2. MLflow nested参数作用规则,nested=True仅可配置在子运行的mlflow.start_run()参数中,用于显式允许在已有活动运行的上下文中启动新运行,默认状态下无需配置即可正常嵌套。 3. MLflow父子运行关联逻辑,父子运行通过元数据中的parent_run_id字段实现关联,与运行名称、标签等用户自定义字段无关。 参考资料: MLflow Official Documentation: Nested Runs, https://mlflow.org/docs/latest/tracking.html#nested-runs Databricks Documentation: Track nested MLflow runs
ML Engineer - Professional · Q4
问题#4 一位机器学习工程师希望使用 MLflow 运行模型 model,并将路径 importance_path 中的 CSV 文件中的特征重要性数据记录下来。 以下哪个代码块可以在现有的 MLflow 运行块中实现此任务?
  • A.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/certified-machine-learning-professional/image2.png">
  • B.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/certified-machine-learning-professional/image3.png">
  • C.
    mlflow.log_data(importance_path, "feature-importance.csv")
  • D.
    mlflow.log_artifact(importance_path, "feature-importance.csv")
  • E.
    这些代码块都无法完成任务。

答案: D

本题要求在处于激活状态的MLflow运行块中,将本地指定路径下的特征重要性CSV文件记录到MLflow的制品存储中。MLflow跟踪模块的log_artifact方法专门用于将本地已存在的文件或目录记录为当前运行的关联制品,方法的第二个参数支持自定义该文件在制品存储中的名称,D选项的调用逻辑完全匹配题目需求,因此选择D选项。 各选项分析: A 题目未提供A选项的具体代码内容,不具备可验证的实现能力,无法完成题目的记录任务,因此错误。 B 题目未提供B选项的具体代码内容,不具备可验证的实现能力,无法完成题目的记录任务,因此错误。 C MLflow公开的顶层Python API中不存在mlflow.log_data方法,属于虚构的API调用,无法实现文件记录功能,因此错误。 D mlflow.log_artifact方法的第一个入参为本地待上传文件的路径,第二个入参为上传后在MLflow制品存储中的目标文件名,本题中调用该方法可以将importance_path路径下的CSV文件以feature-importance.csv的名称记录到当前MLflow运行的制品库中,完全符合题目要求,因此正确。 E 由于D选项可以正确完成任务,因此E选项描述不成立,错误。 关键知识点: 1 MLflow跟踪模块制品记录API,mlflow.log_artifact用于将本地文件或目录上传至当前激活的MLflow运行的制品存储,支持自定义存储名称或子路径。 2 MLflow跟踪核心能力,MLflow跟踪功能支持记录运行过程中的参数、指标、制品、标签等全链路元数据,其中制品可包含任意格式的文件,如数据文件、模型、日志等。 3 MLflow运行上下文规则,在mlflow.start_run()包裹的运行块内调用跟踪类API会自动关联到当前激活的运行,无需额外指定运行标识。 参考资料: 1 MLflow Python API 文档 - mlflow.log_artifact, https://mlflow.org/docs/latest/python_api/mlflow.html#mlflow.log_artifact 2 MLflow 官方跟踪指南 - 记录制品, https://mlflow.org/docs/latest/tracking.html#logging-artifacts
ML Engineer - Professional · Q5
问题#5 以下哪项是监测数值特征漂移的简单、低成本的方法?
  • A.
    詹森-香农检验
  • B.
    统计趋势汇总
  • C.
    卡方检验
  • D.
    这些方法都不能用于监测特征漂移
  • E.
    Kolmogorov-Smirnov (KS) 检验

答案: B

本题正确答案为B。题目要求选择监测数值特征漂移的简单、低成本方法,结合All Certified Machine Learning Professional Questions认证的核心知识体系,统计趋势汇总是指计算当前数值特征的均值、中位数、标准差、分位数、极值等描述性统计指标,将其与模型训练阶段的基线统计指标做对比即可快速判断是否存在漂移,该方法不需要复杂的统计推导和大量算力消耗,甚至可以通过人工计算完成,完全满足简单、低成本的需求,是生产环境中初步筛查数值特征漂移的首选方案。 各选项分析: A. 詹森-香农检验用于度量两个概率分布的差异程度,需要先拟合数据分布再计算散度值,计算复杂度高于简单的统计汇总,不符合简单低成本的要求,因此错误。 B. 统计趋势汇总仅需计算基础描述性统计量并和基线对比,无复杂计算过程,资源消耗极低,适配数值特征漂移的快速筛查场景,符合题目要求,因此正确。 C. 卡方检验是用于检测类别特征分布差异的统计检验方法,无法应用于数值特征的漂移监测,因此错误。 D. 选项B的统计趋势汇总完全可以用于数值特征漂移的初步监测,因此该选项错误。 E. Kolmogorov-Smirnov检验是用于对比两个数值分布是否存在显著差异的假设检验方法,需要计算累积分布函数并执行显著性校验,计算开销远高于统计汇总,不属于简单低成本的方案,因此错误。 关键知识点: 1. 特征漂移监测方法选型规则,需结合场景的算力要求、精度要求选择适配方案,轻量级低延迟场景优先选择统计汇总类方法做初筛。 2. 不同特征类型适配的漂移检测方法差异,数值特征可使用统计趋势汇总、KS检验、JS散度等方法,类别特征可使用卡方检验、PSI等方法。 3. 生产环境特征漂移监测的分层策略,通常先使用低成本的统计趋势汇总做初筛,发现异常后再使用精度更高的统计检验方法做二次校验。 参考资料: Amazon SageMaker 模型监控数据质量检测指南, https://docs.aws.amazon.com/sagemaker/latest/dg/model-monitor-data-quality.html Google Cloud Vertex AI 数据漂移监测文档

常见问题

ML Engineer - Professional 有多少道练习题?

本题库收录 ML Engineer - Professional 练习题共 216 道,含单选、多选等题型,每题配有答案与解析。

ML Engineer - Professional 练习题支持中英文吗?

支持,ML Engineer - Professional 练习题为中英双语对照,便于对照原文理解。

ML Engineer - Professional 练习题可以免费试做吗?

可以,本页提供免费样题在线试做;完整题库可在掌学兔注册后获取。